四道題目形成兩個相關較高的群組,是否就找到兩個心理構念?今天先看這個判斷,再回到因素模型。Day 14 把內部結構放回效度論證;因素分析則提供一套描述共同變動的方式。它可以比較不同結構,卻不能只憑相關矩陣判定題目為何一起變動,更不能直接替因素命名。
常見因素模型(factor model)可寫成:
x = ν + Λ η + ε
觀察變項向量 x 等於截距 ν,加上負荷矩陣 Λ 乘以因素 η,再加上殘差 ε;向量與矩陣在這裡以一般字母表示。
因此在相應條件下:
Σ = Λ Φ Λ' + Θ
觀察變項的共變異數矩陣 Σ 等於 Λ 乘以因素共變異數矩陣 Φ 乘以 Λ 的轉置,再加上殘差共變異數矩陣 Θ。
Λ 是因素負荷量,描述題目與因素的關係;Φ 是因素的共變異數矩陣;Θ 描述殘差共變結構。公式將觀察變項的共變異數分成共同因素與殘差部分。把 Θ 設為對角矩陣,表示共同因素之外的題目殘差不再相關;這是加入模型的限制,不是資料本身告訴我們的事實。
因素分析與 PCA 也不能只因軟體選單相鄰就互換。PCA 對 observed variables 做線性組合以重現總變異;common 因素模型把共同變異與 unique/殘差(residual)部分分開。兩者在某些資料上可能給類似圖形,target 仍不同。
模型還有坐標不唯一的問題。若不加限制,同一共變異數結構(covariance structure)可能由旋轉後的不同因素負荷量座標(loading coordinates)表示;因素(factor)的尺度與方向也需固定。這不是軟體故障,而是潛在變項(latent variable)無天然單位的結果。EFA(探索性因素分析)透過 rotation(轉軸)尋找較可解釋的表示。CFA(驗證性因素分析)則以理論限制縮小可能集合。任何因素負荷量表都應連同 identification 與 rotation 一起閱讀。
這也說明 observed matrix(矩陣)與 model-implied(模型隱含相關) matrix 的關係。資料提供樣本相關,模型提出一組參數來重建母體結構;估計的不確定性來自有限樣本。把樣本中微小差異全部命名成因素,容易把 sampling noise 實體化。後續 parallel analysis(平行分析)正是嘗試建立一個隨機基準,但它不取代理論。
| 層 | 因素模型 |
|---|---|
| 資料機制 | 題目反應因共同因素、題目特定成分與誤差而共變 |
| 目標 | 能解釋 covariance 的 factor number、loadings、factor correlations 與 residual structure |
| 假設 | model form、尺度、識別、抽樣、missing 與 estimator 條件 |
| 可觀察量 | item distributions 與 sample covariance/correlation matrix |
| 估計規則 | 選定 extraction/estimator,使 model-implied 與 observed structure 接近 |
| 保證/限制 | 可比較結構模型;factor 的名稱與構念意義仍需理論和其他證據 |
先看簡化相關矩陣:
| BE01 | BE02 | EE01 | EE02 | |
|---|---|---|---|---|
| BE01 | 1.00 | 0.70 | 0.25 | 0.20 |
| BE02 | 0.70 | 1.00 | 0.22 | 0.24 |
| EE01 | 0.25 | 0.22 | 1.00 | 0.68 |
| EE02 | 0.20 | 0.24 | 0.68 | 1.00 |
兩個 block(矩陣區塊)內相關高、跨 block 較低。兩因素故事很自然:BE 因素連 BE 題,EE 因素連 EE 題,兩因素相關。單因素也可能重現部分正相關,但會難以同時處理 block 內與 block 間差距,留下系統性殘差。
然而矩陣還容許其他故事:題目措辭造成兩個 block;不同作答時段造成共同情境;或一個 general engagement 加兩個 method 因素。因素模型讓故事可計算、可被資料反駁,不替我們自動選定哪一個是構念真相。
把矩陣的第一個 block 相關從 0.70 改成 0.95,可能表示題目非常集中,也可能是近義重複。因素負荷量會很高,內容範圍卻更窄。這連回 Day 13:高共變異數能提高 alpha(內部一致性信度係數),也可能只是冗餘。
將矩陣交給 Claude 時,可以要求至少三個生成故事,並說明各自可觀察的差異。若回答直接把因素命名為行為與情緒投入,先檢查它是否只是讀了 BE、EE 欄名。欄名提供題目的背景,不能被當成矩陣單獨支持構念命名的證據。
一個可執行的檢查是把欄名遮成 X1–X4,再問相同問題。合理回答仍可描述兩個相關群組,卻應承認缺少命名依據。實際執行時須保存提示與回覆;本篇僅提供這道檢查題。它要區分的是因素萃取與因素解釋:前者利用結構,後者還需要題目內容與理論。
軟體產生 Factor 1,作者寫「我們發現了認知投入」。但因素解(factor solution)受到因素數(factor number)、rotation、estimator、樣本與題目集合影響;換一組題目,坐標可能改變。因素是模型中的潛在變項,能否解釋為認知投入,須看因素負荷量 pattern(因素型態)、內容、外部關係和 rival explanations(對立解釋)。
另一個 failure case(失敗案例)是忽略反應尺度。五點 ordinal data(有序類別)的 Pearson 相關(correlation)和 polychoric 相關回答不同潛在反應模型;選擇不能只看哪一個產生較乾淨的因素。Day 16 會把尺度、因素數與 rotation 都寫成 EFA 決策紀錄。
閱讀矩陣時,可先遮住題名,只描述數字支持的模式,再揭開題名提出解釋。這兩步若寫在不同欄,就較容易看到哪一句依賴資料、哪一句加入了內容知識;同一張表換了題目背景,也可能需要不同的構念解釋。
它能問:某個因素模型是否能以較少結構重現共變異數?哪些題目對某因素有較強關係?哪些殘差 pattern 暗示模型漏掉東西?它不直接問:構念是否重要、題目是否公平、分數用途是否適切、因果方向為何。
在 ENGAGE-v1,生成器知道三個潛在變項,讀者也終會知道。這種教學透明度讓我們能檢查方法是否找回設定,卻可能製造「真實研究也有答案」的錯覺。真實資料通常只有競爭模型與有限證據;即使某模型最接近生成設定,也可能因樣本、estimator 或 misspecification 得到別的 solution。因此本文把生成真值用於課後比較,不用於分析時選模。
原問題的答案是:因為相關矩陣含有可被低維結構解釋的 pattern,我們引入潛在因素(latent factor);但因素是受限制的模型物件,不是資料中被挖出的構念實體。發展閱讀是 EFA 與 CFA 的原始方法文獻;前沿閱讀可進 bifactor、exploratory structural equation modeling 與因素不確定性。
本篇的六層表、四題相關矩陣與盲化命名檢查題,讓結構描述和構念解釋各有位置。下一篇開始實際規劃探索:因素數、估計方法、旋轉與解釋,哪些可請 Claude 提候選,哪些必須由教師根據資料與理論裁決?